中国AI初创公司DeepSeek计划进行首轮大规模融资,目标筹集约500亿元人民币(约74亿美元),融资后估值预计达3500亿至4000亿元人民币。该公司凭借V3和R1模型在全球引发关注,改变了外界对中国大模型研发实力的看法。
AI独角兽DeepSeek近期启动首次对外融资,目标估值超200亿美元,腾讯与阿里均有意参与。尽管公司此前依赖创始人梁文锋的量化交易资金,并无急迫融资需求,但此举旨在通过股权激励留住核心人才,应对R1论文作者郭达雅、研究员Wang Bingxuan等关键成员近期流失的挑战。
DeepSeek 下周将推出 V4 大模型,新增支持图片、视频和文本生成功能。这是自 2025 年 1 月 R1 模型后的首次重大升级,进一步布局国内低成本开源市场。财信证券分析师认为,AI 应用商业化进程有望加速,尤其在春节期间,互联网厂商正借助高频消费场景推动技术落地。
深度求索将于下周推出多模态大模型DeepSeek V4,原生支持图像、视频和文本生成。这是继今年1月发布R1推理模型后的首次重大更新,旨在满足国内对低成本开源模型的需求,推动AI发展。同时将发布简要技术说明,详细版本预计一个月后推出。
DeepSeek R1-0528 是一款开源大模型,性能媲美 OpenAI o3 模型。
基于DeepSeek R1和V3模型的浏览器侧边栏AI工具,提供问答、创作、翻译等功能
DeepSeek-V3/R1 推理系统是一个高性能的分布式推理架构,专为大规模 AI 模型优化设计。
一个支持DeepSeek R1的AI驱动研究助手,结合搜索引擎、网络爬虫和大型语言模型进行深度研究。
Deepseek
$4
输入tokens/百万
$12
输出tokens/百万
128
上下文长度
$16
32
Tencent
$0.8
$2
$8
Alibaba
-
$1.6
8
$1
Baidu
64
$100
nvidia
NVIDIA DeepSeek R1 FP4 v2是基于DeepSeek AI的DeepSeek R1模型进行FP4量化的文本生成模型,采用优化的Transformer架构,可用于商业和非商业用途。该模型通过TensorRT Model Optimizer进行量化,相比FP8版本显著减少了磁盘大小和GPU内存需求。
NVIDIA DeepSeek-R1-0528-FP4 v2是DeepSeek R1 0528模型的量化版本,采用优化的Transformer架构,是一个自回归语言模型。通过FP4量化优化,减少了磁盘大小和GPU内存需求,同时保持较高推理效率。
NVIDIA DeepSeek-R1-0528-FP4 是 DeepSeek R1 0528 模型的量化版本,采用优化的 Transformer 架构,权重和激活值量化为 FP4 数据类型,显著减少磁盘大小和 GPU 内存需求,支持 TensorRT-LLM 推理引擎实现高效推理。
DeepSeek AI 公司的 DeepSeek R1 0528 模型的量化版本,基于优化的 Transformer 架构的自回归语言模型,可用于商业和非商业用途。
Sci-fi-vy
DeepSeek-R1-0528是DeepSeek R1系列的小版本升级模型,通过增加计算资源和算法优化显著提升了推理深度和能力,在数学、编程等多个基准测试中表现出色。
QuixiAI
DeepSeek-R1-0528-AWQ 是 DeepSeek R1 0528 的 AWQ 量化版本,通过量化技术提升了模型运行效率,修复了代码问题,提供更稳定的服务。
cognitivecomputations
DeepSeek R1 0528的AWQ量化模型,支持使用vLLM在8块80GB GPU上以全上下文长度运行。
DeepSeek-R1-0528是DeepSeek R1模型的小版本升级,通过增加计算资源和算法优化显著提升了推理能力,在数学、编程和通用逻辑等多个基准评估中表现出色。
deepseek-ai
DeepSeek R1模型已完成小幅版本升级,当前版本为DeepSeek-R1-0528。在最新更新中,DeepSeek R1通过增加计算资源投入并在后训练阶段引入算法优化机制,显著提升了其深度推理与推断能力。
ubergarm
DeepSeek - R1T - Chimera是一个高质量的大语言模型,通过ik_llama.cpp提供的先进量化方案,在保持性能的同时显著减少内存占用。
Nexesenex
Hexagon Purple V2是一个基于Smartracks的三级标准合并模型,包含Deepseek Distill R1、Nemotron和Tulu能力,通过多模型合并优化性能。
qihoo360
Tiny-R1-32B-Preview 是一个基于 Deepseek-R1-Distill-Qwen-32B 的推理模型,专注于数学、代码和科学领域,性能接近完整版 R1 模型。
suayptalha
DeepSeek-R1-Distill-Llama-3B 是基于 Llama-3.2-3B 模型,使用 R1-Distill-SFT 数据集对 DeepSeek-R1 进行蒸馏得到的版本,具备文本生成能力。
NVIDIA DeepSeek R1 FP4 模型是 DeepSeek AI 的 DeepSeek R1 模型的量化版本,使用优化 Transformer 架构的自回归语言模型。该模型通过 FP4 量化技术将参数位数从 8 位减少到 4 位,使磁盘大小和 GPU 内存需求减少约 1.6 倍,同时保持较高的精度性能。
DeepSeek R1模型的FP4量化版本,采用优化后的Transformer架构实现高效文本生成
duxx
本模型是基于DeepSeek-R1-Distill-Qwen-1.5B在土耳其语-R1数据集上微调的版本,主要用于土耳其语相关推理任务。
lightblue
这是DeepSeek R1模型的日语版本,专门针对日语推理任务进行微调,能够可靠且准确地以日语响应提示。
DeepSeek R1模型的AWQ量化版本,优化了float16溢出问题,支持高效推理部署
DeepSeek R1的AWQ量化版本,由Eric Hartford和v2ray完成量化,修复了使用float16时的溢出问题。
Deepseek R1的MCP服务器实现,支持Node.js环境,提供强大的语言模型推理服务。
通过集成DeepSeek R1的推理引擎增强Claude的复杂任务处理能力
该项目通过集成DeepSeek R1的推理引擎增强Claude的复杂任务处理能力,提供多步骤精确推理支持。
Deepseek R1的MCP服务器实现,支持与Claude Desktop集成,提供强大的语言模型推理服务。
本地化运行的智能代理系统,结合推理模型与工具调用模型
一个基于Node.js的Deepseek R1语言模型MCP服务器实现,支持8192令牌上下文窗口,提供稳定的Claude Desktop集成和模型参数配置。
一个利用Deepseek R1模型的思维链进行推理的MCP服务工具,支持在Claude Desktop等客户端中使用。
Thoughtful Claude是一个增强Claude推理能力的MCP服务器,通过集成DeepSeek R1的高级推理引擎,为Claude提供复杂多步推理任务处理能力。
结合DeepSeek R1推理与Claude 3.5生成能力的MCP服务
DeepSeek R1与Claude结合的认知架构项目,通过R1进行高级推理规划,Claude执行具体分析,实现多步骤逻辑推理和结构化思维处理。
该项目通过集成DeepSeek R1的推理引擎,增强Claude处理复杂推理任务的能力,提供高效精准的多步推理解决方案。
DeepSeek MCP Server通过集成DeepSeek R1的先进推理引擎增强Claude的推理能力,使其能够处理复杂的多步推理任务。
DeepSeek MCP Server通过集成DeepSeek R1的高级推理引擎增强Claude的推理能力,使其能够处理复杂的多步推理任务。
DeepSeek MCP服务器通过集成DeepSeek R1的先进推理引擎增强Claude的推理能力,使其能够处理复杂的多步推理任务。
DeepSeek-Claude MCP服务器通过整合DeepSeek R1的先进推理引擎,增强Claude处理复杂推理任务的能力。